Skip to content

Choosing imputation models

Marbach (2021)

DisciplineSocial science
MethodSimulation
Tagsdata · secondary survey analysisimputationmethod · descriptive statisticsmethod · simulationmissing datamodel selectionstatistical methods

Summary

Problem: 缺失数据插补是数据分析中的重要预处理步骤,但文献中缺乏关于如何在众多插补模型(如随机森林、热卡插补、预测均值匹配、多元正态插补等)之间进行选择的指导。由于插补不同于最优点预测,标准的模型选择方法(如交叉验证)用途有限。 Approach: 本文提出一个简单标准:选择能够生成与观测值条件密度最相似的插补值密度的插补模型。具体操作上,建议使用稳定平衡权重(stable balancing weights)来平衡协变量分布,使缺失与观测组在协变量上可比,然后利用差异统计量(如标准化均值差、方差比、Kolmogorov–Smirnov统计量、重叠系数)比较插补值与加权后观测值的密度差异。 Finding: 通过模拟数据和2008年美国全国选举研究(ANES)真实调查数据的应用,发现不同插补模型在不同数据集上的表现存在差异。在模拟数据中,热卡插补和随机森林插补表现更好;而在ANES数据中,预测均值匹配插补表现最佳。多元正态插补在两个数据集中均表现较差。 Significance: 该研究为应用研究者提供了一种概念上简单、实用且不依赖特定插补模型的模型选择方法,有助于减少对列表删除(list-wise deletion)的依赖,并促进多重插补在应用研究中的更广泛使用。

Theoretical Framework

  • Theoretical tradition: 该论文属于统计方法论传统,具体位于缺失数据处理和因果推断的交叉领域。
  • Prior theories built upon: 论文建立在Rubin的缺失数据理论框架上,特别是缺失随机(MAR)假设(Rubin 1976; Little and Rubin 2019);同时借鉴了因果推断中的平衡权重方法(Hainmueller 2012; Zubizarreta 2015)和协变量平衡诊断统计量(Franklin et al. 2014)。
  • Causal mechanism: 在i.i.d.和MAR假设下,给定协变量X,缺失值的条件密度f(Y|X=x, M=0)等于观测值的条件密度f(Y|X=x, M=1)。因此,插补模型生成的插补值密度与观测值密度越相似,就越符合MAR假设,也就越可能是更好的插补模型。
  • Key assumptions: 观测独立同分布(i.i.d.);数据缺失机制为MAR,即缺失指示符M在给定协变量X的条件下与Y独立;插补模型本身也依赖这些假设。
  • Theoretical move: 本文应用并扩展了已有的诊断思想(比较插补值与观测值密度),通过引入加权步骤解决了未调整比较在非完全随机缺失(MCAR)情况下的局限性,将因果推断中的平衡技术综合到缺失数据诊断中。
  • Scope conditions: 该方法适用于MAR假设下的插补模型选择;对于缺失非随机(MNAR)的情况,作者明确表示需要更多研究。方法不限于特定插补模型,适用于任何生成填充数据集的插补方法。

Research Design

本文采用模拟研究(simulation study)实证案例应用相结合的设计。模拟部分:生成1,000个数据集(N=1,000),数据生成过程为线性模型y = x·z + e,其中z为伯努利分布(均值0.5),x为均匀分布(范围-5到5),误差方差为1。缺失比例随z变化(0.1–0.5范围内独立抽取),符合MAR假设。实证部分:使用2008年ANES调查数据(N=2,265),包含11个变量,由Kropko et al. (2014)准备。两种设计中,均使用四种插补方法(预测均值匹配、热卡插补、随机森林插补、正态模型/多元正态插补)对每个数据集插补五次,然后应用所提出的诊断方法评估各插补模型的性能。

Data & Sample

  • 模拟数据:1,000个模拟数据集,每个N=1,000,共1,000,000个观测。数据生成自线性模型,协变量z为二值变量,x为连续变量。
  • 实证数据:2008年美国全国选举研究(ANES),N=2,265。包含11个变量:年龄、性别、种族、教育、收入、宗教、婚姻状况、政府支持、环境、投票选择、响应时间。缺失值数量从0到393不等(宗教变量缺失最多)。数据来源为Kropko et al. (2014)准备的数据集。

Analytical Strategy

  • 权重计算:采用Zubizarreta (2015)的稳定平衡权重方案,通过凸二次规划问题最小化权重方差,同时约束使缺失组与观测组的协变量均值平衡(容差参数δp通常设为小值或0)。可加入高阶项(如x²p)以平衡二阶矩。
  • 差异统计量:使用四种统计量比较加权后观测值与插补值的密度差异:标准化均值差(SMD)、对数方差比(log(VR))、Kolmogorov–Smirnov统计量(KS)、重叠系数(1-OVL)。对二值变量仅使用SMD(均值即充分统计量)。
  • 多重插补处理:对每个数据集插补五次,差异统计量在多个插补数据集间取平均。
  • 模拟评估:在模拟研究中,还估计了包含交互项的线性回归模型系数,比较各插补方法下的估计偏差(真值减估计值)。
  • 稳健性检查:在ANES分析中,补充分析平衡了人口学变量(性别、年龄、种族)与所有其他变量的交互项,结果与主分析基本一致(见补充图A.7)。

Results & Findings

  • 模拟数据结果:在非线性数据生成过程下,不依赖线性假设的插补方法(热卡插补和随机森林插补)表现更好,其差异统计量平均更接近零。热卡插补在SMD上平均更接近零,四种统计量联合表明热卡插补产生更好的插补数据。相应地,基于更好插补数据的系数估计偏差更小:热卡插补后主效应和交互效应均无平均偏差;随机森林插补后主效应无偏差但交互效应仍有部分偏差;正态模型插补和预测均值匹配插补的偏差在主效应和交互效应上均较大。
  • ANES数据结果:最大差异出现在“宗教”变量的SMD上,多元正态插补和随机森林插补的SMD密度均远离零,且多元正态插补的密度与其他三种方法明显不同。多元正态插补在“投票”和“政府支持”变量上也表现较差(SMD、OVL系数和KS统计量均显示)。四种方法在方差比上差异不大。平均而言,预测均值匹配插补在SMD、KS统计量和OVL系数上表现最佳,随机森林插补在方差比上最佳(但这仅针对连续变量)。
  • 关键发现:不同数据集上各插补方法的相对表现不同——预测均值匹配在ANES数据上优于热卡插补和随机森林插补,但在模拟数据上表现较差。这一差异强调了针对特定数据集比较插补模型性能的重要性。
  • 零结果/意外发现:多元正态插补在两个数据集中均表现较差,这与预期一致(因其线性假设与非线性数据生成过程不匹配)。权重构造的差异不能解释四种插补方法的表现差异,因为权重在四种方法间基本一致。

Limitations

  • 方法仅适用于MAR假设下的插补模型选择;对于缺失非随机(MNAR)的情况,作者明确表示需要更多研究。
  • 当协变量X本身包含缺失值时,所提出的方法比较的是Y的(完整)条件密度而非联合密度,作者承认更全面的评估应比较Y和所有协变量X的联合密度,并指出这是未来研究的方向。
  • 权重方案主要平衡协变量密度的一阶矩(均值),高阶矩(如方差)可能仍有中等程度的不平衡,虽然作者指出这些不平衡在四种插补方法间差异不大,不能解释性能差异。
  • 权重方案不显式平衡高阶交互项,虽然补充分析表明加入交互项后结果基本一致。

Key Contributions

  • 提出了一种概念上简单、实用且不依赖特定插补模型的插补模型选择方法,填补了文献中缺乏插补模型选择指导的空白。
  • 将因果推断中的平衡权重方法(特别是Zubizarreta的稳定平衡权重)创新性地应用于缺失数据诊断,解决了未调整密度比较在非MCAR情况下的局限性。
  • 系统比较了四种流行插补方法(预测均值匹配、热卡插补、随机森林插补、多元正态插补)在模拟和真实数据上的表现,提供了实证证据。
  • 开发并发布了R软件包missDiag(可在CRAN获取),降低了应用研究者使用该方法的门槛。
  • 强调了插补模型选择应针对特定数据集进行,而非盲目依赖最流行的方法,有助于减少对列表删除的依赖。
  • 展示了加权和插补这两种常被视为替代策略的缺失数据处理方法可以有机结合,为未来研究开辟了方向。

Key Claims

"choose the imputation model that produces imputed values that are more consistent with the assumed missing data mechanism." (Section 1, Introduction)

"Imputation models for which imputed values are more similar to the observed values after adjustment are more consistent with MAR and may be preferred over imputation models that lead to imputed values with larger deviations." (Section 2, Adjusted Comparison of Imputed and Observed Values)

"This differential performance across datasets highlights the importance of comparing the performance of imputation approaches and choosing the one that performs the best on a particular dataset." (Section 4, Imputing Real-World Survey Data)

"The approach is flexible and does not have to be tailored to a particular imputation model; all it needs is the data with the missing values and the filled-in dataset." (Section 5, Conclusion)

"We also hope that this contribution lowers the barriers faced by applied researchers trying to address missing data in their data analysis and therefore reduces the reliance on list-wise deletion, which always leads to inefficient estimates but typically also introduces bias." (Section 5, Conclusion)


My Notes